Type: entity
Confidence: 0.98
Created: 2026-04-18
Updated: 2026-04-18
Tags: 技术研究NLP深度学习历史

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (2019 论文)

概述

Devlin 等人于 2019 年 NAACL 发表的 BERT 论文,提出了双向 Transformer 预训练模型,通过掩码语言模型下一句预测任务学习深层双向语言表示,一次性刷新 11 项 NLP 基准,确立了"预训练+微调"的 NLP 标准范式

关键内容

论文信息

条目 内容
标题 BERT: Pre-training of Deep Bidirectional Transformer 架构</td> </tr> <tr> <td><strong>作者</strong></td> <td>[[Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina ToutanovaGoogle AI Language)
发表时间 2019 年(arXiv 提交于 2018 年 10 月)
会议 NAACL 2019
机构 Google AI Language

核心创新

  1. 双向预训练:突破单向语言模型限制,通过 掩码语言模型(MLM) 实现真正双向上下文理解
  2. 多任务预训练:MLM(词级别)+ 下一句预测(NSP)(句子级别)联合训练
  3. 微调范式:预训练权重作为参数初始化,下游任务只需添加简单输出层并微调几个 epoch
  4. 架构简洁:纯 Transformer架构 Encoder 堆叠,无 Decoder,无复杂任务特定架构

模型配置

| 配置 | 层数 L | 隐藏维度 H | 注意力头数 A | 参数量 | |------|--------|-----------|------------|--------| | BERT-Base | 12 | 768 | 12 | 110M | | BERT-Large | 24 | 1024 | 16 | 340M |

实验结果

一次性刷新 11 项 NLP 基准:

任务 之前 SOTA BERT 提升
GLUE 72.8 80.5 +7.7
SQuAD 1.1 F1 91.7 93.2 +1.5(超人类)
SQuAD 2.0 F1 76.3 86.3 +10.0
MultiNLI 86.7 86.7(Large:90.9)
CoNLL NER F1 91.9 92.8 +0.9

训练细节

历史影响

来源

相关